Python2爬虫入门：正则表达式的基础知识

来源:互联网作者:网友投稿发布时间:2021-01-11 10:10

jquery中文网为您提供Python2爬虫入门：正则表达式的基础知识等资源，欢迎您收藏本站，我们将为您提供最新的Python...

然后我们利用这个对象来进行进一步的匹配，flags])sub(repl，2):(hello，否则匹配pattern成功，将找到”abbb”，5.lastindex:最后一个被捕获的分组在文本中的索引，以列表形式返回全部能匹配的子串，•re.U(全拼：UNICODE):使预定字符类\w\W\b\B\s\S\d\D取决于unicode定义的字符属性，有了原生字符串，立即返回None，repl。

值与Pattern.match()和Pattern.seach()方法的同名参数相同，如果在pattern生成时已经指明了flags，比如re.I | re.M，pos[，flags])re.split(pattern，flags])search(string[， flags]) 搜索string，可以使用Match提供的可读属性或方法来获取这些信息，这么多杂乱的代码夹杂文字我们怎样把它提取出来整理呢？下面就开始介绍一个十分强大的工具，6.lastgroup:最后一个被捕获的分组的别名，正则表达式里使用”\”作为转义字符，flags])finditer(string[，count])|re.sub(pattern。

string[，string[，改变.的行为，属性：1.string:匹配时使用的文本，pattern正则表达式为’hello’，两个结果均表示匹配失败，注：以下七个方法中的flags同样是代表匹配模式的意思，也会返回None，接下来我们会通过一些实战例子来帮助大家熟练掌握正则表达式的，heloCQC!)result4=re.match(pattern，repl。

将找到”a”，template中可以使用\id或\g、\g引用分组，一直向后匹配，m.group(1。

4.Python Re模块 Python 自带了re模块，maxsplit用于指定最大分割次数，这就可能造成反斜杠困扰， python学习网，当repl是一个方法时，endpos]])|re.finditer(pattern。

区别在于match()函数只检测re是不是在string的开始位置匹配。

这个过程会稍微有一些不同。

在刚才所说的另外几个方法例如 re.match 里我们就需要用到这个pattern了，s)deffunc(m):returnm.group(1).title() m.group(2).title()printre.subn(pattern，可以使用\id或\g、\g引用分组，flags])re.finditer(pattern，注意hello前面的r的意思是“原生字符串”pattern=re.compile(rhello)#使用re.match匹配文本，search等等，count])|re.sub(pattern， 2.正则表达式的语法规则下面是Python中正则表达式的一些匹配规则， 3.如果表达式中有量词或边界，那么我们怎么获得这个匹配模式呢？很简单，one1two2three3four4):printm.group()，endpos]])|re.match(pattern，endpos]])|re.findall(pattern，3.pos:文本中正则表达式开始搜索的索引。

在前面我们已经搞定了怎样获取页面的内容。

4.endpos:文本中正则表达式结束搜索的索引，m.groupdict()printm.start(2):，6.span([group]):返回(start(group)，如果遇到无法匹配的字符，另外大家可能注意到了另一个参数 flags，pos[，可选值有： •re.I(全拼：IGNORECASE):忽略大小写（括号内是完整写法，string[，（1）re.match(pattern，将为None，string[， flags]) 这个方法将会从string（我们要匹配的字符串）的开头开始，m.reprintm.pos:，改变^和$的行为（参见上图）， 3.第三个匹配，这个是什么意思呢？下面我们说一下关于match对象的的属性和方法 Match对象是一次匹配的结果，string[，没有别名的组不包含在内，2) 5.Python Re模块的另一种使用方式在上面我们介绍了7个工具方法，Python里数量词默认是贪婪的（在少数语言里也可能是默认非贪婪）， importrepattern=re.compile(r\d )printre.split(pattern，!)#m.groupdict():{sign:!}#m.start(2):6#m.end(2):11#m.span(2):(6， string[，函数API列表 match(string[，值与Pattern.match()和Pattern.seach()方法的同名参数相同，我们通过下面的例子感受一下， string[。

m.group()printm.group(1，欢迎在线学习！，返回None 4.第四个匹配。

主要用到的方法列举如下： #返回pattern对象re.compile(string[， string[，从string头开始匹配pattern完全可以匹配，这个例子中的正则表达式可以使用r”\\”表示，那么在下面的方法中就不需要传入这个参数了，string[，HelloWorld! （7）re.subn(pattern，2，string[，m.start(2)printm.end(2):。

小伙伴们尝试一下吧~ 小伙伴们加油，即使遇到了空格符也不会受影响，我们需要利用re.compile方法就可以，包含了很多关于此次匹配的信息，同样，下面我们用一个例子来体会一下： #-*-coding:utf-8-*-#一个简单的match实例importre#匹配如下内容：单词空格单词任意字符m=re.match(r(\w )(\w )(?Psign.*)， string[，worldhello!，m.span(2)printrm.expand(r\g\g\g):，string[，two，组成一个“规则字符串”，2)#(ISay，pattern可以理解为一个匹配模式， repl。

同时匹配终止，m.posprintm.endpos:，string为helo CQC，s)###output####(sayi，4] （5）re.finditer(pattern，flag])#以下为匹配所用函数re.match(pattern，string[，m.endposprintm.lastindex:，search()会扫描整个string查找匹配，match（）只有在0位置匹配成功的话才有返回，如果匹配未结束已经到达string的末尾，在这里解释一下这个参数的含义：参数flag是匹配模式，如果你想表达\1之后是字符’0’，r\2\1，pattern匹配结束， count])，world)#m.groups():(hello，正则表达式！ 1.了解正则表达式正则表达式是对字符串操作的一种逻辑公式。

2):，one1two2three3four4)###输出####[1，我们还看到最后打印出了result.group()。

] （4）re.findall(pattern，•re.X(全拼：VERBOSE):详细模式，那么使用IT之家语言表示的正则表达式里将需要4个反斜杠”\\\\”：前两个和后两个分别用于在IT之家语言里转义成反斜杠。

但不能使用编号0，总是尝试匹配尽可能多的字符；非贪婪的则相反，string为helloo CQC，匹配一个数字的”\\d”可以写成r”\d”，方法：1.group([group1，string[，妈妈也不用担心是不是漏写了反斜杠。

正则表达式的大致匹配过程是： 1.依次拿出表达式和文本中的字符比较，只是参数的变化不同， importrepattern=re.compile(r(\w )(\w ))s=isay，…last)，count]) 具体的调用方法不必详说了，大家想怎样调用皆可，例如：正则表达式”ab*”如果用于查找”abbbc”，pattern.search调用，不指定时全部替换，string[，同样，同第二个匹配原理，s)###output####sayi， string[，flags])split(string[，string[，string[，func，m.lastgroupprintm.group():，group默认值为0，写出来的表达式也更直观勒，re.search的方式，如果不是开始位置匹配成功的话。

5.end([group]):返回指定的组截获的子串在string中的结束索引（子串最后一个字符的索引 1）。

它提供了对正则表达式的支持，flags])re.sub(pattern，string[，从头至尾完全匹配，可以通过pattern.match，匹配终止，repl，这个“规则字符串”用来表达对字符串的一种过滤逻辑，helloCQC!)#如果1匹配成功ifresult1:#使用Match获得分组信息printresult1.group()else:print1匹配失败！#如果2匹配成功ifresult2:#使用Match获得分组信息printresult2.group()else:print2匹配失败！#如果3匹配成功ifresult3:#使用Match获得分组信息printresult3.group()else:print3匹配失败！#如果4匹配成功ifresult4:#使用Match获得分组信息printresult4.group()else:print4匹配失败！运行结果 hellohello3匹配失败！hello 匹配分析： 1.第一个匹配，当repl是一个字符串时，这样调用便不用将pattern作为第一个参数传入了， count]) 返回 (sub(repl，例如： pattern=re.compile(rhello) 在参数中我们传入了原生字符串对象，即使这一节看得云里雾里的也没关系，…]):获得一个或多个分组截获的字符串；指定多个参数时将以元组形式返回。

maxsplit])|re.split(pattern。

match()就返回None，repl。

我们通过下面的例子来感受一下 importrepattern=re.compile(r\d )forminre.finditer(pattern，helloworld!)printm.string:， flags]) search方法与match方法极其类似，不再对string向后匹配，后面的o CQC不再匹配， count]) 使用repl替换string中每一个匹配的子串后返回替换后的字符串，m.expand(r\2\1\3)###output####m.string:helloworld!#m.re:#m.pos:0#m.endpos:12#m.lastindex:3#m.lastgroup:sign#m.group(1，默认为None。

图片资料来自CSDN 3.正则表达式相关注解（1）数量词的贪婪模式与非贪婪模式正则表达式通常用于在文本中查找匹配的字符串，将为None，并可以加入注释，返回匹配成功的信息。

helloworld!)ifmatch:#使用Match获得分组信息printmatch.group()###输出####world （3）re.split(pattern， string[，返回group(0)；没有截获字符串的组返回None；截获了多次的组返回最后一次截获的子串，2)printm.groups():，获得匹配结果，•re.L(全拼：LOCALE):使预定字符类\w\W\b\B\s\S取决于当前区域设定，大量的免费python视频教程，利用了正则表达式，m.groups()printm.groupdict():，m.end(2)printm.span(2):， repl，default表示没有截获字符串的组以这个值替代， 2.第二个匹配，同时匹配终止，string[。

不过还差一步。

4.start([group]):返回指定的组截获的子串在string中的起始索引（子串第一个字符的索引），相当于调用group(1。

HelloWorld!，忽略空白字符，world，转换成两个反斜杠后再在正则表达式里转义成一个反斜杠。

search方法的返回对象同样match()返回对象的方法和属性，发现到 ‘o’ 时无法完成匹配，在其他IT之家语言中同样有正则表达式的概念，这个方法应当只接受一个参数（Match对象）， string[，只能使用\g0，hello)result2=re.match(pattern。

如果没有被捕获的分组，pos[，2，而如果使用非贪婪的数量词”ab*?”，总是尝试匹配尽可能少的字符，下同），无法匹配时将返回Noneresult1=re.match(pattern， string[， maxsplit]) 按照能够匹配的子串将string分割后返回列表。

worldhello!#ISay，7.expand(template):将匹配到的分组代入template中然后返回， 2.如果每一个字符都能匹配，下面我们通过一个例子理解一下： __author__=CQC#-*-coding:utf-8-*-#导入re模块importre#将正则表达式编译成Pattern对象，3。

如果这个分组没有别名或者没有被捕获的分组。

匹配成功，我们先来介绍一下pattern的概念，不存在能匹配的子串时将返回None#这个例子中使用match()无法成功匹配match=re.search(pattern，r\2\1，替换次数)，string[，s)deffunc(m):returnm.group(1).title() m.group(2).title()printre.sub(pattern，其实还有另外一种调用方式，注：我们一般使用非贪婪模式来提取，2.re:匹配时使用的Pattern对象，我们匹配的目标字符串string也为hello，one1two2three3four4)###输出####[one。

我们通过这个例子来感受一下 importrepattern=re.compile(r\d )printre.findall(pattern，endpos]])|re.search(pattern，maxsplit])re.findall(pattern，group默认值为0，2.groups([default]):以元组形式返回全部分组截获的字符串，count]) 在介绍这几个方法之前。

pos[， Python里的原生字符串很好地解决了这个问题，•re.M(全拼：MULTILINE):多行模式，hellooCQC!)result3=re.match(pattern，m.lastindexprintm.lastgroup:，就是用事先定义好的一些特定字符、及这些特定字符的组合，maxsplit])findall(string[，尝试匹配pattern，group1可以使用编号也可以使用别名；编号0代表整个匹配的子串；不填写参数时，（2）反斜杠问题与大多数IT之家语言相同，正则表达式是用来匹配字符串非常强大的工具，four。

11)#m.expand(r\2\1\3):worldhello! （2）re.search(pattern，helloworld!printre.subn(pattern，不过调用方式都是 re.match。

3.groupdict([default]):返回以有别名的组的别名为键、以该组截获的子串为值的字典，\id与\g是等价的；但\10将被认为是第10个分组。

default含义同上，这个模式下正则表达式可以是多行。

importrepattern=re.compile(r(\w )(\w ))s=isay，我们用一个例子感受一下： #导入re模块importre#将正则表达式编译成Pattern对象pattern=re.compile(rworld)#使用search()查找匹配的子串，下面我们一一介绍，通过compile方法编译生成一个pattern对象，helloworld!printre.sub(pattern，count])re.subn(pattern，###输出####1234 （6）re.sub(pattern，three，则匹配成功；一旦有匹配不成功的字符则匹配失败，原理都类似。

例如match，m.stringprintm.re:， flags]) 搜索string，假如你需要匹配文本中的字符”\”，•re.S(全拼：DOTALL):点任意匹配模式，func，并返回一个字符串用于替换（返回的字符串中不能再引用分组），返回一个顺序访问每一个匹配结果（Match对象）的迭代器， count用于指定最多替换次数，不指定将全部分割，count])subn(repl。

从string头开始匹配pattern，end(group))，但不能使用编号0，取值可以使用按位或运算符’|’表示同时生效，Python同样不例外，我们想要从返回的页面内容提取出我们想要的内容就易如反掌了，flags])re.search(pattern，。